Bias+SiLU（Swish）融合：一次内核完成加偏置与 SiLU 激活，减少内核次数与显存往返。

torchcode.py：参考实现 `y = silu(x + bias)`。
cudacode.py：`__global__ void bias_silu_kernel(...)` 完成融合计算。
run_code.py：比较精度与性能（100 次迭代，`rtol=1e-03`）。
